導(dǎo)讀:一、Apache①、通過(guò)修改 .htaccess 文件修改網(wǎng)站目錄下的.htaccess,添加如下代碼即可(2 種代碼任選):可用代碼 (1):RewriteEngineOnRewriteCond%{HTTp_USER_AGENT}(^$|FeedDemo
發(fā)表日期:2019-05-12
文章編輯:興田科技
瀏覽次數(shù):13784
標(biāo)簽:
一、Apache
①、通過(guò)修改 .htaccess 文件
修改網(wǎng)站目錄下的.htaccess,添加如下代碼即可(2 種代碼任選):
可用代碼 (1):
RewriteEngineOnRewriteCond%{HTTp_USER_AGENT}(^$|FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedparser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|python–urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)[NC]RewriteRule^(.*)$–[F]
可用代碼 (2):
SetEnvIfNoCase^User–Agent$.*(FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedparser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|python–urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)BADBOTOrderAllow,DenyAllowfromallDenyfromenv=BADBOT
②、通過(guò)修改 httpd.conf 配置文件
找到如下類似位置,根據(jù)以下代碼 新增 / 修改,然后重啟 Apache 即可:
Shell
DocumentRoot/home/wwwroot/xxx<Directory“/home/wwwroot/xxx”>SetEnvIfNoCaseUser–Agent“.*(FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedparser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|python-urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)”BADBOTOrderallow,denyAllowfromalldenyfromenv=BADBOT</Directory>
二、Nginx 代碼
進(jìn)入到 nginx 安裝目錄下的 conf 目錄,將如下代碼保存為 agent_deny.conf
cd/usr/local/nginx/confvimagent_deny.conf
#禁止Scrapy等工具的抓取if($http_user_agent~*(Scrapy|Curl|HttpClient)){return403;}#禁止指定UA及UA為空的訪問(wèn)if($http_user_agent~*“FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedparser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|python-urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms|^$”){return403;}#禁止非GET|HEAD|pOST方式的抓取if($request_method!~^(GET|HEAD|pOST)$){return403;}
然后,在網(wǎng)站相關(guān)配置中的 location / { 之后插入如下代碼:
Shell
includeagent_deny.conf;
如下的配置:
Shell
[marsge@Mars_Server~]$cat/usr/local/nginx/conf/zhangge.conflocation/{try_files$uri$uri//index.php?$args;#這個(gè)位置新增1行:includeagent_deny.conf;rewrite^/sitemap_360_sp.txt$/sitemap_360_sp.phplast;rewrite^/sitemap_baidu_sp.xml$/sitemap_baidu_sp.phplast;rewrite^/sitemap_m.xml$/sitemap_m.phplast;
保存后,執(zhí)行如下命令,平滑重啟 nginx 即可:
Shell
/usr/local/nginx/sbin/nginx–sreload
三、pHp 代碼
將如下方法放到貼到網(wǎng)站入口文件 index.php 中的第一個(gè)
pHp
//獲取UA信息$ua=$_SERVER[‘HTTp_USER_AGENT’];//將惡意USER_AGENT存入數(shù)組$now_ua=array(‘FeedDemon‘,‘BOT/0.1(BOTforJCE)’,‘CrawlDaddy‘,‘Java’,‘Feedly’,‘UniversalFeedparser’,‘ApacheBench’,‘Swiftbot’,‘ZmEu’,‘IndyLibrary’,‘oBot’,‘jaunty’,‘YandexBot’,‘AhrefsBot’,‘MJ12bot’,‘WinHttp’,‘EasouSpider’,‘HttpClient’,‘MicrosoftURLControl’,‘YYSpider’,‘jaunty’,‘python-urllib’,‘lightDeckReportsBot’);//禁止空USER_AGENT,dedecms等主流采集程序都是空USER_AGENT,部分sql注入工具也是空USER_AGENTif(!$ua){header(“Content-type:text/html;charset=utf-8”);die(‘請(qǐng)勿采集本站,因?yàn)椴杉恼鹃L(zhǎng)木有小JJ!’);}else{foreach($now_uaas$value)//判斷是否是數(shù)組中存在的UAif(eregi($value,$ua)){header(“Content-type:text/html;charset=utf-8”);die(‘請(qǐng)勿采集本站,因?yàn)椴杉恼鹃L(zhǎng)木有小JJ!’);}}
四、測(cè)試效果
如果是 VpS,那非常簡(jiǎn)單,使用 curl -A 模擬抓取即可,比如:
模擬宜搜蜘蛛抓?。?/p>
Shell
curl–I–A‘YisouSpider’bizhi.bcoderss.com
模擬 UA 為空的抓取:
Shell
curl–I–A”bizhi.bcoderss.com
模擬百度蜘蛛的抓?。?/p>
Shell
curl–I–A‘Baiduspider’bizhi.bcoderss.com
更多新聞
2023
前言在互聯(lián)網(wǎng)時(shí)代,擁有一個(gè)精美、易用的網(wǎng)站對(duì)于企業(yè)和個(gè)人而言至關(guān)重要。。無(wú)論是商業(yè)推廣、信息傳播還是...
View details
2023
什么是云浮網(wǎng)頁(yè)修改?云浮網(wǎng)頁(yè)修改指的是對(duì)一個(gè)網(wǎng)站進(jìn)行排名優(yōu)化和用戶體驗(yàn)優(yōu)化的過(guò)程。。通過(guò)對(duì)網(wǎng)頁(yè)內(nèi)容、...
View details
2023
多功能網(wǎng)站建設(shè)內(nèi)容SEO營(yíng)銷:了解多功能網(wǎng)站建設(shè)內(nèi)容的重要性作為一個(gè)企業(yè)主或網(wǎng)站管理員,你可能已經(jīng)意...
View details
2023
引言在當(dāng)今數(shù)字化時(shí)代,擁有一個(gè)個(gè)人或商業(yè)網(wǎng)站已經(jīng)成為了非常重要的事情。。網(wǎng)站可以作為展示產(chǎn)品和服務(wù),...
View details